iT邦幫忙

2026 iThome 鐵人賽

DAY 27
0
Claude AI

研究生自救指南:30 天用 Claude Code 打造我的論文工具箱系列 第 27 篇

Day 27|研究資料到底能不能餵給 AI:把 Day 1 那條線的理由講清楚

  • 分享至 

  • xImage
  •  

問卷裡有一題開放式問答:「還有什麼想補充的嗎?」大部分人隨手寫一兩句,但有幾筆寫得很長,裡面提到了具體的單位、班別、甚至隱約看得出是在講哪一次事件。我原本想把這幾十筆開放式回答直接丟給 AI,請它幫忙做主題歸類,省下自己一句一句讀的時間。

游標停在輸入框上的那幾秒,我把這件事停下來了。今天要把 Day 1 那句「未去識別化的研究資料不離開我的電腦」,講清楚它背後真正在防什麼,而不是一句喊出來心安的口號。

「不離開我的電腦」這句話,其實不夠精確
寫 Day 1 的時候,我用了這個說法,但今天要老實修正它:Claude Code 雖然在本機啟動,但模型本身跑在雲端伺服器上。 我在終端機打字、看到的回應,中間有一段是我的內容被送到遠端、算完再傳回來。這不是 Claude Code 特有的問題,任何雲端 AI 服務都是這樣運作的——「本地執行的工具」跟「資料不會離開電腦」是兩件不同的事,前者只保證程式碼和檔案存在本機,不保證每一次互動的內容都留在本機。

這個修正很重要,因為它改變了「怎麼做才安全」的答案。安全的關鍵不是「用本機工具」,是我有沒有把含識別資訊的內容,放進跟 AI 互動的那個輸入裡。

回頭看,Day 14 那條規則其實一直在做兩件事
Day 14 訂下「AI 不碰資料,只寫碰資料的程式」,當時的理由是正確性——程式可以重跑、可以被讀懂、不會像 Day 18 那次一樣把原始資料覆蓋掉。

今天重新看這條規則,發現它同時也在解決今天這篇的問題:因為 AI 只負責寫一段清理資料的程式碼,實際執行程式、真正碰到每一筆受試者資料的,是我電腦上的 Python 直譯器,不是那次跟 AI 的對話。反向計分、補值、離群值標記,這些操作發生在我的機器上,資料的實際內容從來沒有被送進跟 AI 往返的訊息裡。

我當初訂這條規則的時候,完全沒有想到它同時解決了隱私問題,是寫這篇回顧的時候才意識到的。這件事讓我對「規則明確、可驗證、可逆才讓它動手」這個判準多了一層信心——一條好的規則,常常同時擋住不只一種風險,即使訂規則的當下沒有想到全部的理由。

但這也代表 Day 8 的摘要卡要重新檢視一次:那個工具是讓 AI 直接讀 PDF 全文,做的是文獻,不是受試者資料,這件事沒有問題。但如果哪天我想用同樣的邏輯處理問卷裡的開放式文字回答——就是今天開頭那個「差一點」——那就是把受試者原話直接送進對話,跟 Day 14 的原則完全相反,之前建立的工具箱裡沒有一個現成的做法適用。

這條線背後的規範理由,不是「怕外洩」那麼簡單
多數人講研究倫理,直覺想到的是「資料外洩」。但更根本的問題是受試者當初同意的是什麼。

我的研究計畫書送倫理委員會審查的時候,同意書上寫的是「僅供本研究之研究者及指導教授查閱使用」。這句話寫的時候,AI 工具根本不在考慮範圍內。如果我把受試者的原始回答,不管有沒有去識別化,送進一個第三方的 AI 服務,嚴格來說已經超出了受試者同意的使用範圍——不是因為 AI 公司會拿去做壞事,是因為受試者從來沒有被告知、也沒有機會同意「你的回答會被送去給一個 AI 系統處理」這件事。

我查了自己的計畫書,裡面完全沒有提到會使用生成式 AI 協助資料處理。這代表我現在做的事,嚴格來說可能需要跟倫理委員會報告一次計畫變更,即使我處理的每一筆資料都已經去識別化。這件事我還沒做,寫到這裡決定把它排進這週的待辦——寧可保守一點問一次,也不要事後才發現這是個問題。

我實際畫的線,重新寫一次
Day 1 那三條,今天補上每一條背後真正在擋什麼:

不生成沒查證過的引用——擋的是「捏造出來、看起來卻很真實」的內容,被我沒發現地放進論文。這條跟隱私無關,是正確性問題。

不讓 AI 寫論文內容——擋的是思考被外包之後,論文不再是我的。這條也跟隱私無關,是學術主體性問題。

未去識別化的研究資料不離開我的電腦——這條才是隱私問題,而且今天要把它拆得更細:

含直接識別碼的欄位(姓名、身分證字號、電話、精確服務單位),不管有沒有「去識別化」的其他處理,絕對不進入任何跟 AI 的對話,包含本機執行的 Claude Code——因為模型推論在雲端,這個限制不因為工具是本機安裝就解除。
已經去識別化的結構化數字(量表分數、年資、班別代碼),可以用 Day 14 那種「AI 只寫程式,我的電腦執行」的方式處理,資料內容不會出現在對話裡。
開放式文字回答,即使去識別化,也可能因為描述的事件太具體而重新變得可識別——這正是今天開頭卡住我的那種情況。這類資料我現在的原則是不進 AI 對話,人工處理,除非有更嚴謹的去識別化方法我還沒做到。
成本也是這件事的一部分
三十天,Claude Code 訂閱費大概是一杯手搖飲料乘以四週的等級,對研究生的生活費是有感的一筆支出,但換算成前面二十六篇省下的時間,划算——這是我自己的判斷,划不划算因人而異,看你目前每小時的機會成本值多少。

寫這篇之前我沒有想過把「成本」跟「隱私倫理」放在同一篇,後來覺得該放在一起:兩者都是「這個工具的代價是什麼」這個問題的答案,一個用錢算,一個用信任算。 錢花完了知道花在哪;信任一旦處理錯,沒有辦法補救——這也是為什麼隱私這條線,我寧可畫得比實際需要更保守一點。

明天
Day 28:我砍掉的三個工具。不是每個想法都變成能用的東西,這三個失敗案例,跟前面二十六個成功的案例一樣值得寫下來。


上一篇
Day 26|打包分享:同一套工具,換一個人用會不會就壞了
下一篇
Day 28|我砍掉的三個工具:想清楚為什麼失敗,比做出來更難
系列文
研究生自救指南:30 天用 Claude Code 打造我的論文工具箱 共 30 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言